Listing Available Models
List All Pretrained Models
List Model Architectures
Query Specific Models
Model Zoo Overview
Vision Transformer (ViT) Models
ViT models provide excellent accuracy-efficiency tradeoffs:ResNet Models
Classic CNN-based architectures:ConvNeXt Models
Modern CNN architectures with competitive performance:SigLIP Models
Models trained with SigLIP loss function:EVA Models
State-of-the-art EVA-CLIP models:Training Dataset Information
OpenAI WIT
- Dataset: WebImageText (WIT) - 400M image-text pairs
- Models: Original OpenAI CLIP models
- Tags:
openai
LAION Datasets
- LAION-400M: 400M English image-text pairs
- LAION-2B: 2B English image-text pairs
- LAION-5B: 5B multilingual image-text pairs
- Tags:
laion400m_*,laion2b_*,laion5b_*
DataComp
- DataComp-XL: 1.4B filtered image-text pairs
- DataComp-L: 1.0B pairs
- DataComp-M: 128M pairs
- DataComp-S: 13M pairs
- Tags:
datacomp_xl_*,datacomp_l_*,datacomp_m_*,datacomp_s_*
WebLI (SigLIP)
- Dataset: Google’s WebLI dataset
- Models: SigLIP models with sigmoid loss
- Tags:
webli
Model Selection Guide
- Speed Priority
- Accuracy Priority
- Balanced
Fastest inference:
- ViT-B-32: Best speed/accuracy tradeoff
- RN50: Classic CNN option
- MobileCLIP-S1: Ultra-fast mobile deployment
Loading from HuggingFace Hub
Many models are available on HuggingFace Hub:Popular HuggingFace Models
laion/CLIP-ViT-L-14-DataComp.XL-s13B-b90Klaion/CLIP-ViT-H-14-laion2B-s32B-b79Klaion/CLIP-ViT-bigG-14-laion2B-39B-b160kapple/DFN5B-CLIP-ViT-H-14timm/ViT-SO400M-14-SigLIP-384
HuggingFace models automatically download config and weights. The
hf-hub: prefix explicitly specifies HuggingFace as the source.Multilingual Models
Models trained on multilingual datasets:xlm-roberta-base-ViT-B-32xlm-roberta-large-ViT-H-14ViT-B-16-SigLIP-i18n-256(SigLIP multilingual)
Specialized Models
CoCa (Captioning)
Models with generative capabilities:DFN Models
Apple’s Distilled Feature Networks:Performance Metrics
For detailed zero-shot performance across 38 datasets, see the full results CSV.Benchmark Datasets
- ImageNet: Primary zero-shot benchmark
- ImageNet variants: -A, -R, -Sketch, -V2
- Object recognition: CIFAR-10/100, STL-10, Food101
- Fine-grained: Flowers102, Pets, Cars, Aircraft
- Scene: SUN397, Places365
- Action: UCF101, Kinetics700
